OpenAIの首席科学者、Astraモデルの監視問題に回答 計算グラフの深度は大幅に向上していないと明言

OpenAI のチーフサイエンティスト Jakub Pachocki は、次世代モデル Astra の技術的方向性について最近公開のコメントを行い、「監視不可能」な状態に対する懸念を和らげようとしています。彼は現地時間の9月2日にソーシャルメディアで投稿し、混乱した報道によって「監視不可能な状態に向かう競争」を引き起こさないようにしたいと述べ、Astra を含む現在の最前線モデルは、GPT-4 と比較して計算グラフの深さが2倍未満であり、外部の懸念される計算の複雑さが明らかに増加しているわけではないと強調しました。

Astra の循環深度技術が監視の議論を引き起こす

以前の情報によれば、Astra は「循環深度」(Recurrent Depth)と呼ばれる推論技術を採用する可能性があります。この技術は、同じグループの Transformer 層が複数回の循環計算を行うことで、モデルが内部でより多くの推論ステップを完了できるようにし、従来の形式の可視思考チェーンに完全に依存しないようにします。この方向性は、数学やプログラミングなどのタスクにおけるモデルのパフォーマンスを向上させ、同時に一部の計算コストを削減する可能性があると見なされています。しかし、一部の推論プロセスがモデル内部に隠される可能性があるため、AI セキュリティ分野で「監視不可能」への懸念が引き起こされています。

AI セキュリティ研究者が監視能力の低下を警告

支持者は、モデルの内部推論能力を高めることがパフォーマンスの向上に寄与すると考えていますが、セキュリティ研究者は、モデルが大量の隠れた内部推論を行うことができる場合、外部から完全なプロセスを観察できず、将来的にモデルの行動監査、安全評価、事故調査の難易度が増す可能性があると懸念しています。AI セキュリティ組織 Redwood Research の CEO Buck Shlegeris は、この点について非常に懸念を示し、関連技術をさらに進めて循環回数を大幅に増加させると、思考チェーンの監視能力が弱まる可能性があり、安全調査がより困難になると述べています。

OpenAI は思考チェーンの監視が構造の変化によって無効になるわけではないと強調

Pachocki は、思考チェーンの監視技術には確かに脆弱性が存在し、新たな課題に直面していることを認めましたが、これらの問題は構造の変化自体によって引き起こされているわけではないと述べました。彼は、OpenAI は初期の推論モデル以来、思考チェーンの監視を維持し利用することに取り組んできたと指摘し、これによってモデルの整合性能力が訓練データの分布からどのように一般化されるかを理解しようとしていると述べました。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle